学习模式

【电商服装】不仅是换装:教你用 AI 生成连贯、真实的口播视频

5个月前 AI UGC 一镜到底视频生成 作者:西瓜
UGC
服装
电商
AI
Nike
口播视频
现在的 AI 视频与其说是“生成”,不如说是“抽卡”。但要在电商场景落地,我们需要的是精准控制,今天分享一套经过实战验证的 SOP 工作流,实现人物、服装、动作的高度连贯。

一起来看一下成品:

那么接下来,按照我的思路和步骤,你也可以做出这样的作品,一起来实操吧~

准备工具


方案一

Flowpix (https://www.flowpix.club) 一站式AI生成平台

工作提取:

https://www.flowpix.club/bj/694.html?token=aaa37ae49fd5eff35ceabf9259346f7e

image.png


方案二

Nanobanana pro https://gemini.google.com/

Gemini3 pro https://gemini.google.com/



第一步:构建人物“灵魂”


不管是 Nano banana pro 还是 Midjourney,高质量的底图是视频成功的一半。我们首先利用 Gemini 3 Pro 强大的逻辑推理能力,将抽象的需求转化为精准的绘画提示词。

image.png


核心参数输入模型: 为了保证人设的稳定性,我们需要先自定义以下标准化参数,将这些参数交给Gemini3pro

以下是我的参数


年龄: 20 - 22 岁。
性别: 女。
人种: 高加索人种(典型的英格兰长相,皮肤透着健康的红润)。
特点: 轮廓清晰,拥有经常运动带来的紧致下颌线。耳朵上排着几个精致的小银环(耳骨钉),展现出一种叛逆的活力。
年龄: 20 - 22 岁。
性别: 女。
人种: 高加索人种(典型的英格兰长相,皮肤透着健康的红润)。
特点: 轮廓清晰,拥有经常运动带来的紧致下颌线。耳朵上排着几个精致的小银环(耳骨钉),展现出一种叛逆的活力。
头发: 亚麻浅金色(Ash Blonde),扎成一个利落的高马尾,或者是一个略显随性的高碎发发髻(Messy Bun)。额前有几缕被汗水或微风拨乱的碎发,显得非常自然。
五官:
眼睛: 清澈的天蓝色,睫毛浓密,眼神中透着自信和一点“不好惹”的酷劲。
鼻子: 笔直且带有轻微的小驼峰,显得英气十足。
唇部: 饱满且涂了透明唇蜜,看起来自然湿润。
穿搭: 上装: 一件连帽卫衣
气质: 自信、充满生命力、阳光但带着一点街头冷淡感。她步履轻盈,看起来像是随时准备去健身房,或是骑着自行车穿梭在伦敦繁忙的街道上。





第二步:产品植入与换装


得到满意的人物底图(图1)后,为了展示我们真实的商品(如视频中的 Nike 卫衣):


局部重绘/换装: 上传你的产品实拍图,直接使用Nano banana pro将人物原本的衣服替换为目标商品。

image.png

重点:这一步要确保衣服的材质、Logo(如 Nike 刺绣)、抽绳细节与实物一致。




第三步:绘制关键帧脚本


这是“一镜到底”最核心的步骤。我们要像画分镜一样,生成一组连续的静态图(图1 - 图7)。


图1(起始): 人物看镜头。

image_node_9 (1).jpeg


图2(咖啡): 人物手持咖啡,看镜头。

image_node_26 (1).jpeg


图3(展示): 人物低头看衣服,手指指向 Logo 刺绣。

image_node_13.jpeg


图4(细节): 镜头推近,展示领口和抽绳细节。

image_node_19 (1).jpeg


图5(面料): 展示袖口紧实度。

image_node_17 (5).jpeg


图6(互动): 人物拉起帽子准备戴上。

image_node_21 (1).jpeg


图7(戴帽): 帽子完全戴好,包裹住头部。

image_node_11.jpeg


技巧: 每一张图都是基于上一张图进行微调,确保人物长相、环境光影严格一致,只改变动作。




第四步:首尾帧“桥接”生成


有了这一组连续的图片,我们不再盲目生成视频,而是使用“首尾帧”:


Clip A: 设置 [图1] 为起始帧,[图2] 为结束帧 → 生成视频片段。

Prompt:

女孩正在手持拍摄一个UGC风格的TikTok视频,自然地说着话,就像在社交媒体上和亲密朋友聊天一样。她21岁,就像在和朋友八卦一样。肢体语言和面部丰富。阴雨天气。她说:"Honestly, I didn't expect it to be this cold today. Good thing I grabbed this hoodie before heading out for coffee; it's a lifesaver."说话的同时举起右手的咖啡

image.png


Clip B: 设置 [图2] 为起始帧,[图3] 为结束帧 → 生成视频片段。

Prompt:
女孩正在手持拍摄一个UGC风格的TikTok视频,自然地说着话,就像在社交媒体上和亲密朋友聊天一样。她21岁,兴奋地说着话,就像在和朋友八卦一样。肢体语言和面部表情非常丰富。阴雨天气。她说:"It feels surprisingly thick. You know that heavy, cozy feeling that makes you feel secure? It’s got that."说话的同时她把咖啡放下,手指领口的logo

image.png


Clip C: 设置 [图3] 为起始帧,[图4] 为结束帧 → 生成视频片段。
Prompt

女孩正在手持拍摄一个UGC风格的TikTok视频,自然地说着话,就像在社交媒体上和亲密朋友聊天一样。她21岁,兴奋地说着话,就像在和朋友八卦一样。肢体语言和面部表情非常丰富。阴雨天气。她说:" I actually really like the embroidery here. And look at these colorful strings—a bit retro without being too much."说话的同时她镜头对准自己的领口logo,画面中间虚焦了一下

image.png


循环操作: 依次完成所有片段的生成。


这种方法完美解决了 AI 视频容易“崩坏”和“甚至变形”的问题,牢牢锁住了人物的一致性。




第五步:剪辑与合成


将生成的 Clip A, B, C... 按顺序导入轨道。

由于我们是首尾相连生成的,视频片段之间的衔接会非常丝滑,几乎看不出剪辑痕迹,形成“一镜到底”的视觉错觉。

只需要简单拼接即可。

image.png

加上字幕后导出视频

【免责声明】 本课程内容仅为AIGC技术教学与案例分析之目的,所引用的品牌名称、商标、Logo、广告素材等均属各自权利人所有。本平台与所提及的任何品牌方不存在任何形式的合作、联名、代言或授权关系。课程内容仅供学习参考,不构成任何商业建议。如权利人认为内容涉及侵权,请联系我们(联系方式 WX:Xiaofengguwen010),我们将在核实后第一时间处理。

最后在评论区上传您的作品,一起讨论吧~


速用卡

视频生成执行卡

把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。

一句话重点

这节课不是先追求炫技成片,而是围绕「不仅是换装:教你用 AI 生成连贯、真实的口播视频」先把主体、动作、镜头和节奏稳住。

落地顺序

按原文节奏走最稳:先吃透「准备工具」,再把「第一步:构建人物“灵魂”」定住,接着处理「第二步:产品植入与换装」;最后用「第三步:绘制关键帧脚本」收口。

照着做清单
  1. 先把「准备工具」里的主体和动作定死。
  2. 这一段重点看镜头和节奏,别急着炫技。
  3. 做完「第二步:产品植入与换装」后,先查连贯性和穿帮。
  4. 先把「第三步:绘制关键帧脚本」里的主体和动作定死。
  5. 做完「第五步:剪辑与合成」后,先查连贯性和穿帮。
最容易踩坑

不要一上来就生成最终片;先拆镜头、定主体和运动,再逐段生成,否则容易跳轴、穿帮、节奏混乱。

成品自检

检查主体是否稳定;镜头运动是否明确;前后画面是否连贯;节奏是否服务主题;是否有明显变形或穿帮。

可直接复制的万能模板
请围绕「不仅是换装:教你用 AI 生成连贯、真实的口播视频」帮我做一个可直接执行的方案。
我的目标是:【填写你的具体目标】
我的素材/产品/角色信息是:【填写已有素材和限制】

请输出:核心创意、分镜表、每个镜头的画面描述、视频生成提示词、剪辑顺序和成片自检清单。要求主体稳定、动作明确、镜头连贯。